-
MWM 论文精读:让世界模型预测真正影响机器人决策的东西精读 ICML 2026 的 Mask World Model:以未来语义 mask 而非 RGB 像素训练世界模型,并用预测特征驱动扩散策略,提升机器人对外观变化的鲁棒性。
15 min read -
LingBot-VA 2.0 论文精读:原生视频-动作预训练如何服务通用机器人控制精读 LingBot-VA 2.0:以语义视觉-动作 tokenizer、因果 MoE DiT、Multi-Chunk Prediction 与异步闭环推理,实现可泛化的 video-action robot control。
17 min read -
LeRobot 论文精读:把机器人学习做成端到端开源基础设施精读 LeRobot:统一机器人中间件、LeRobotDataset、可异步推理栈与可复用策略实现,分析其如何降低真实机器人学习的工程门槛。
19 min read -
Hume 论文精读:让 VLA 先思考,再流畅行动精读 Hume 的 value-guided System-2 thinking 与 cascaded action denoising,并对照官方代码分析双系统异步控制。
13 min read -
FineVLA 论文精读:用细粒度语言让 VLA 真正听懂“怎么做”精读 FineVLA:从异构轨迹清洗、DTW 采样到 RoboFine-Bench 与 FG/Raw 混合训练,理解细粒度指令如何带来可操控的机器人行为。
19 min read -
FD-VLA 论文精读精读 FD-VLA:用视觉与机器人状态蒸馏出力觉 token,在不依赖力传感器的情况下提升接触丰富操作。
17 min read -
dWorldEval 论文精读:用离散扩散世界模型规模化评估机器人策略精读 dWorldEval:把视觉、语言和动作放进同一离散 token 序列,以关键帧记忆和 progress token 实现可扩展的机器人策略评估。
20 min read -
DreamZero 论文精读:World Action Models are Zero-shot Policies精读 DreamZero:把 14B 视频扩散模型改造成同时预测未来视频与动作的 World Action Model,并分析其零样本泛化、跨本体迁移与 7Hz 实时控制。
19 min read -
Cosmos Policy 论文精读:把视频扩散模型变成策略、世界模型与规划器精读 Cosmos Policy:无需改动视频模型架构,通过 latent frame injection 联合生成动作、未来状态和值,并用 rollout 数据实现模型式规划。
22 min read -
AIM:带空间价值图的意图感知统一世界-动作模型论文精读精读 AIM:用空间价值图把视频世界建模与动作意图连接起来,并以 intent-causal attention 与 GRPO 提升 RoboTwin 操作成功率。
23 min read -
A2A 论文精读:用历史动作替代高斯噪声的 Flow Matching 策略精读 A2A:把历史本体动作编码为 Flow Matching 的起点,以轻量 MLP 生成未来动作,在单步推理下兼顾低延迟与视觉鲁棒性。
20 min read -
VLA-0 论文精读:不改 VLM,直接把动作写成文本精读 VLA-0:以 Qwen2.5-VL 为底座,不新增动作 token 或动作头,仅用数字文本、动作集成和 masked action augmentation 构建高性能 VLA。
21 min read -
UniDex 论文精读:从第一视角人类视频到通用灵巧手控制精读 UniDex:用人类视频构建跨形态灵巧手数据集,以 FAAS 统一动作空间,并用 3D VLA 实现零样本跨手迁移。
19 min read -
LAPA 论文精读:从无动作标签视频学习 Vision-Language-Action 模型精读 LAPA:用 VQ-VAE 从相邻视频帧学习离散 latent action,再让 VLM 预测它,最后用少量机器人动作标签完成真实控制映射。
25 min read -
Knowledge Insulating Vision-Language-Action Models 论文精读精读 Knowledge Insulation:用离散动作学习保护 VLM 表征,再用无梯度回传的 Flow Matching action expert 实现快速、连续且更会听指令的 VLA。
22 min read